融合算子：Sin-Affine-Gate（一次核内完成仿射与正弦门控，直接返回 y = x * sin(α*z + β)，其中 z = x*scale + bias）。通过融合计算减少显存往返与内核启动，适合周期性信号或相位敏感的逐维门控。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`
- 计算流程：`z = x*scale + bias`，`g = sin(alpha*z + beta)`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：提供 PyTorch 参考 `Model`，实现上述公式；`get_inputs()` 与 `get_init_inputs()` 保持统一接口
- `cudacode.py`：使用 `load_inline` 实现单核融合（仿射+sin 门控+乘法），编译参数 `-O3 --use_fast_math`
- `run_code.py`：100 次迭代统计耗时；精度判定：`rtol=1e-03, atol=1e-06`；打印加速比

CUDA 实现要点
- 并行策略：`grid = B`（每行一个 block），块内线程沿 D 连续访问，保证合并读写
- 对齐向量化：`float4` 路径需 16 字节对齐且 `D%4==0`，否则标量路径；两路径逻辑一致
- 指令优化：仿射使用 `fmaf`；正弦函数采用 `--use_fast_math`；循环 `#pragma unroll 4`
- 访存与写回：一次遍历计算并写回 `y`，避免中间张量与多核启动
- 线程配置：以 `block=1024` 为基准，可按设备与 D 调整到 `256/512/1024`

评估与目标
- 精度对齐：`torch.allclose(..., rtol=1e-03, atol=1e-06)` 通过
- 性能：基准规模下期望 ≥1.0x；更大规模或更好对齐通常进一步增益

加分项（可选）
- 统一处理对齐与非对齐路径的尾部元素，减少分支与尾循环开销
- 在 D 很大时，每线程批量处理多个元素以提升指令与带宽利用

